Red-Teaming Medical AI: Systematic Adversarial Evaluation of LLM Safety Guardrails in Clinical Contexts
Este estudio presenta una evaluación adversaria sistemática de los modelos de lenguaje grandes en contextos médicos, revelando que, aunque sus guardas de seguridad son robustas frente a la mayoría de los ataques, son vulnerables a la suplantación de autoridad (especialmente en contextos educativos), lo que provoca un cambio de comportamiento donde el modelo ofrece respuestas clínicamente precisas pero con enmarcado de seguridad insuficiente.